Recherche d'information dans des documents structurés par proximité des termes
نویسنده
چکیده
RÉSUMÉ. Nous présentons une méthode pour calculer un score d’un élément quelconque d’un document structuré qui prend en compte la proximité des termes de la requête dans le texte du document. Plus précisément nous définissons autour de chaque occurrence d’un terme de la requête une fonction d’influence. Pour une occurrence qui apparaît dans le texte proprement dit, cette fonction d’influence décroit linéairement de 1 à 0 selon la distance à l’occurrence. Lorsqu’un terme de la requête apparaît dans le titre d’une (sous-)section d’un document structuré, son influence est uniformément 1 du début à la fin de la (sous-)section. Nous utilisons des requêtes booléennes et les fonctions d’influence sont combinées à chaque nœud ET et OU de l’arbre de la requête selon le modèle de la logique floue. Le score d’une partie quelconque de document est la normalisation de la somme de la fonction d’influence résultante à la racine de l’arbre de la requête sur l’intervalle associé à cette partie. Nous présentons et commentons les résultats obtenus dans le cadre de la tâche ad’hoc de la campagne INEX 2006.
منابع مشابه
Classification non supervisée floue des termes basée sur la proximité pour les systèmes de recherche d'information
RÉSUMÉ. Le regroupement des termes basé sur la mesure de proximité est une stratégie menant efficacement à trouver les documents pertinents. Contrairement à ce qu’ont montré les études récentes qui ont utilisé la proximité des termes pour le classement des documents, le processus de recherche d’information est entièrement revu dans ce travail en ce qui concerne les étapes d’indexation et d’inte...
متن کاملExtraction de la localisation des termes pour le classement des documents
Résumé. Trouver et classer les documents pertinents par rapport à une requête est fondamental dans le domaine de la recherche d’information. Notre étude repose sur la localisation des termes dans les documents. Nous posons l’hypothèse que plus les occurrences des termes d’une requête se retrouvent proches dans un document alors plus ce dernier doit être positionné en tête de la liste de réponse...
متن کاملQuery Expansion by Local Context Analysis
RÉSUMÉ. La tâche de notre recherche est de fournir le contexte de recherche à un moteur de recherche, i.e. étendre une requête. Nous proposons une méthode d’expansion automatique de requêtes basée sur la proximité des termes. Elle estime l’importance des termes candidats selon la proximité des termes de la requête dans les premiers documents retrouvés. L’évaluation sur les collections TREC indi...
متن کاملUn outil de détection automatique de thèmes
Vu la quantité de documents numériques disponible sur le Web et la nécessité de mettre au point des techniques de recherche efficaces, les systèmes de recherche d'information font de plus en plus appel aux techniques de Traitement Automatique des Langues (TAL) qui exploitent les informations syntaxiques ou sémantiques, dans le but d’améliorer la qualité des résultats fournis par les moteurs de ...
متن کاملRecherche d'information dans MEDLINE
RÉSUMÉ. Cet article décrit la banque documentaire MEDLINE depuis laquelle une collection test comprenant environ 4,5 million de documents structurés a été construite à partir des campagnes d’évaluation TREC. Dans une deuxième partie, nous évaluons et comparons l’efficacité du dépistage de l’information de dix modèles (probabiliste, modèle de langue, approches vectorielles). Cette évaluation est...
متن کامل